Apprentissage par différences temporelles (Temporal-Difference - TD)

1. Introduction

Les méthodes d'apprentissage par différences temporelles sont une combinaison des idées vues en programmation dynamique et de Monte-Carlo:

  • Comme les méthodes de Monte-Carlo, elles permettent d'apprendre directement à partir d'échantillons issus de l'expérience, et cela sans avoir besoin de connaître la dynamique complète de l'environnement.
  • Comme avec la méthode de programmation dynamique, elles mettent à jour leurs estimations en se basant sur d'autre estimations, cela sans attendre forcément la fin d'un épisode complet (on dit qu'elles bootstrap, c'est-à-dire quelles amorcent de nouvelles itérations avant la fin de l'épisode)

Comme d'habitude les différentes étapes que nous allons suivre sont les suivantes:

  • Prédiction : L'objectif est d'apprendre la fonction des valeurs des états $V\pi$ de l'environnement pour une stratégie $\pi$ suivie par un agent.
  • Estimation : Le but est d'estimer la fonction des valeurs d'actions $q_\pi$.
  • Contrôle : Finalement, en utilisant les estimations précédentes, l'objectif est ici de trouver des stratégies optimales.

Pour le problème de contrôle, l'ensemble des méthodes (programmation dynamique, par différence temporelle et de Monte-Carlo) se basent sur les méthodes d'itérations des stratégies (Generalized Policy Iteration - GPI).Les différences entre ces méthodes se trouvent plutôt sur l'approche qui consiste à réaliser les prédictions les estimations.